Micron Document
<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>FASTA-Format</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/FASTA-Format"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-FASTA-Format rootpage-FASTA-Format skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">FASTA-Format</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p>Das <b>FASTA-Format</b> ist ein textbasiertes <a href="Datenformat" title="Datenformat">Format</a> zur Darstellung und Speicherung der <a href="Prim%C3%A4rstruktur" title="Primärstruktur">Primärstruktur</a> von <a href="Nukleins%C3%A4uren" title="Nukleinsäuren">Nukleinsäuren</a> (<a href="Nukleins%C3%A4uresequenz" class="mw-redirect" title="Nukleinsäuresequenz">Nukleinsäuresequenz</a>) und <a href="Protein" title="Protein">Proteinen</a> (<a href="Proteinsequenz" class="mw-redirect" title="Proteinsequenz">Proteinsequenz</a>) in der <a href="Bioinformatik" title="Bioinformatik">Bioinformatik</a>. Die <a href="Nukleinbasen" title="Nukleinbasen">Nukleinbasen</a> bzw. <a href="Aminos%C3%A4uren" title="Aminosäuren">Aminosäuren</a> werden durch einen Ein-Buchstaben-<a href="Code" title="Code">Code</a> dargestellt. Es ist dabei möglich, den Sequenzen einen Namen und Kommentare voranzustellen.
</p><p>Die Einfachheit des Formats macht es Textverarbeitungswerkzeugen und <a href="Skriptsprache" title="Skriptsprache">Skriptsprachen</a> leicht, die Daten einzulesen und zu verarbeiten.
</p>

<div class="mw-heading mw-heading2"><h2 id="Format">Format</h2></div>
<p>Eine Sequenz im FASTA-Format beginnt mit einer einzeiligen Beschreibung, dann folgen die Sequenzdaten. Es wird empfohlen, dass jede Zeile der Datei maximal 80 Zeichen enthalten soll. Eine Sequenz endet mit dem Ende der Datei oder einer weiteren Kopfzeile.
</p><p>Es folgt ein einfaches Beispiel einer Proteinsequenz im FASTA-Format vom <a href="Cytochrom_b" title="Cytochrom b">Cytochrom b</a> des <a href="Asiatischer_Elefant" title="Asiatischer Elefant">Asiatischen Elefanten</a>:<sup id="cite_ref-1" class="reference"><a href="#cite_note-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup>
</p>
<pre>&gt;gi|5524211|gb|AAD44166.1| cytochrome b [Elephas maximus maximus]
LCLYTHIGRNIYYGSYLYSETWNTGIMLLLITMATAFMGYVLPWGQMSFWGATVITNLFSAIPYIGTNLV
EWIWGGFSVDKATLNRFFAFHFILPFTMVALAGVHLTFLHETGSNNPLGLTSDSDKIPFHPYYTIKDFLG
LLILILLLLLLALLSPDMLGDPDNHMPADPLNTPLHIKPEWYFLFAYAILRSVPNKLGGVLALFLSIVIL
GLMPFLHTSKHRSMMLRPLSQALFWTLTMDLLTLTWIGSQPVEYPYTIIGQMASILYFSIILAFLPIAGX
IENY
</pre>
<div class="mw-heading mw-heading3"><h3 id="Kopfzeile">Kopfzeile</h3></div>
<p>Die Kopfzeile (engl. <a href="Header" title="Header">Headerline</a>) ist die Zeile, die einen (eindeutigen) Namen sowie eine Beschreibung der jeweiligen Sequenz beinhaltet. Sie steht den Sequenzdaten voran und beginnt mit einem Größer-Als-Zeichen („&gt;“). Ohne Leerzeichen folgt daraufhin der Name und/oder eine <a href="Identifikationsnummer" class="mw-redirect" title="Identifikationsnummer">ID</a> der Sequenz. Viele <a href="Sequenzdatenbank" title="Sequenzdatenbank">Sequenzdatenbanken</a> benutzen standardisierte Kopfzeilen, welche es erlauben, automatisch verschiedene Informationen aus der Kopfzeile zu beziehen. Die Kopfzeile kann auch mehrere IDs enthalten, welche dann durch ein ^A (Control-A) Zeichen separiert werden. Die Kopfzeile in dieser Form ist optional. Wichtig ist, dass mehrere Sequenzen in einer FASTA-Datei durch ein „&gt; + Beschreibung“ voneinander getrennt werden.
</p>
<div class="mw-heading mw-heading3"><h3 id="Kommentare">Kommentare</h3></div>
<p>Nach der Kopfzeile folgen optional eine oder mehrere Kommentarzeilen, welche jeweils mit einem Semikolon („;“) beginnen. Auch das Semikolon muss das erste Zeichen in der jeweiligen Zeile sein. Viele <a href="Datenbank" title="Datenbank">Datenbanken</a> und <a href="Anwendungsprogramm" class="mw-redirect" title="Anwendungsprogramm">Anwendungsprogramme</a> erkennen die Kommentare nicht, daher finden sich diese Kommentare praktisch in keiner aktuellen Sequenzdatenbank. Sie sind jedoch Teil des offiziellen Formates. Ein Beispiel einer FASTA-Datei mit mehreren Sequenzen sowie Kommentarzeilen:
</p>
<pre>&gt;Sequenz 1
;Kommentarzeile A
MTEITAAMVKELRESTGAGMMDCKNALSETNGDFDKAVQLLREKGLGKAAKKADRLAAEG
LVSVKVSDDFTIAAMRPSYLSYEDLDMTFVENEYKALVAELEKENEERRRLKDPNKPEHK
IPQFASRKQLSDAILKEAEEKIKEELKAQGKPEKIWDNIIPGKMNSFIADNSQLDSKLTL
MGQFYVMDDKKTVEQVIAEKEKEFGGKIKIVEFICFEVGEGEVAAQL
&gt;Sequenz 2
;Kommentarzeile B
;Kommentarzeile C
SATVSEINSETDFVAKNDQFIALTKDTTAHIQSNSLQSVEELHSSTINGVKFEEYLKSQI
ATIGENLVVRRFATLKAGANGVVNGYIHTNGRVGVVIAAACDSAEVASKSRDLLRQICMH
</pre>
<div class="mw-heading mw-heading3"><h3 id="Sequenzdarstellung">Sequenzdarstellung</h3></div>
<p>Nach Kopfzeile und Kommentar folgen eine oder mehrere Zeilen, die die Sequenz enthalten. Jede Zeile sollte nicht mehr als 80 Zeichen beinhalten. Sequenzen können Protein- oder Nukleinsäuresequenzen sein, dürfen Lücken und <a href="Sequenzalignment" title="Sequenzalignment">Alinierungszeichen</a> enthalten. Die Sequenzen sollten gemäß den <a href="International_Union_of_Biochemistry" class="mw-redirect" title="International Union of Biochemistry">IUB</a>/<a href="IUPAC" class="mw-redirect" title="IUPAC">IUPAC</a>-Standardcodes für <a href="Aminos%C3%A4uren" title="Aminosäuren">Aminosäuren</a> und Nukleinsäuren angegeben werden. Erlaubte Ausnahmen sind hierbei:
</p>
<ul><li>Kleinbuchstaben sind zulässig, werden aber in Großbuchstaben umgewandelt</li>
<li>Ein Binde- oder Gedankenstrich stellt eine Lücke dar</li>
<li>In Aminosäuresequenzen stellen „U“ und „*“ zulässige Zeichen dar. (Siehe unten)</li>
<li>Nukleotidsequenzen werden in 5' nach 3' Richtung dargestellt.</li></ul>
<p>Numerische Zeichen sind nicht erlaubt, werden jedoch in einigen Datenbanken verwendet, um die Position der Sequenz anzuzeigen.
</p>
<table class="wikitable sortable">
<caption>Erlaubte Codes für Nukleinbasen
</caption>
<tbody><tr class="hintergrundfarbe6">
<th>Code
</th>
<th>Bedeutung
</th></tr>
<tr>
<td>A
</td>
<td><a href="Adenin" title="Adenin"><b>A</b>denin</a>
</td></tr>
<tr>
<td>C
</td>
<td><a href="Cytosin" title="Cytosin"><b>C</b>ytosin</a>
</td></tr>
<tr>
<td>G
</td>
<td><a href="Guanin" title="Guanin"><b>G</b>uanin</a>
</td></tr>
<tr>
<td>T
</td>
<td><a href="Thymin" title="Thymin"><b>T</b>hymin</a>
</td></tr>
<tr>
<td>U
</td>
<td><a href="Uracil" title="Uracil"><b>U</b>racil</a>
</td></tr>
<tr>
<td>R
</td>
<td>G A (<a href="Purinbasen" class="mw-redirect" title="Purinbasen">Pu<b>R</b>ine</a>)
</td></tr>
<tr>
<td>Y
</td>
<td>T C (<a href="Pyrimidinbasen" class="mw-redirect" title="Pyrimidinbasen">P<b>Y</b>rimidine</a>)
</td></tr>
<tr>
<td>K
</td>
<td>G T (<a href="Ketone" title="Ketone"><b>K</b>etone</a>)
</td></tr>
<tr>
<td>M
</td>
<td>A C (<a href="Aminogruppe" title="Aminogruppe">A<b>M</b>inogruppen</a>)
</td></tr>
<tr>
<td>S
</td>
<td>G C (<b>S</b>tarke Wechselwirkung)
</td></tr>
<tr>
<td>W
</td>
<td>A T (<b>W</b>eiche Wechselwirkung)
</td></tr>
<tr>
<td>B
</td>
<td>G T C (nicht A) (<b>B</b> kommt nach A)
</td></tr>
<tr>
<td>D
</td>
<td>G A T (nicht C) (<b>D</b> kommt nach C)
</td></tr>
<tr>
<td>H
</td>
<td>A C T (nicht G) (<b>H</b> kommt nach G)
</td></tr>
<tr>
<td>V
</td>
<td>G C A (nicht T, nicht U) (<b>V</b> kommt nach U)
</td></tr>
<tr>
<td>N
</td>
<td>A G C T (a<b>N</b>y)
</td></tr>
<tr>
<td>-
</td>
<td>Lücke unbestimmter Länge
</td></tr></tbody></table>
<table class="wikitable sortable">
<caption>Tabelle II: Erlaubte Codes für Aminosäuren
</caption>
<tbody><tr class="hintergrundfarbe6">
<th>Code
</th>
<th>Bedeutung
</th></tr>
<tr>
<td>A
</td>
<td><a href="Alanin" title="Alanin">Alanin</a>
</td></tr>
<tr>
<td>B
</td>
<td><a href="Asparagins%C3%A4ure" title="Asparaginsäure">Asparaginsäure</a> or <a href="Asparagin" title="Asparagin">Asparagin</a>
</td></tr>
<tr>
<td>C
</td>
<td><a href="Cystein" title="Cystein">Cystein</a>
</td></tr>
<tr>
<td>D
</td>
<td><a href="Aspartat" class="mw-redirect" title="Aspartat">Aspartat</a>
</td></tr>
<tr>
<td>E
</td>
<td><a href="Glutamate" title="Glutamate">Glutamat</a>
</td></tr>
<tr>
<td>F
</td>
<td><a href="Phenylalanin" title="Phenylalanin">Phenylalanin</a>
</td></tr>
<tr>
<td>G
</td>
<td><a href="Glycin" title="Glycin">Glycin</a>
</td></tr>
<tr>
<td>H
</td>
<td><a href="Histidin" title="Histidin">Histidin</a>
</td></tr>
<tr>
<td>I
</td>
<td><a href="Isoleucin" title="Isoleucin">Isoleucin</a>
</td></tr>
<tr>
<td>K
</td>
<td><a href="Lysin" title="Lysin">Lysin</a>
</td></tr>
<tr>
<td>L
</td>
<td><a href="Leucin" title="Leucin">Leucin</a>
</td></tr>
<tr>
<td>M
</td>
<td><a href="Methionin" title="Methionin">Methionin</a>
</td></tr>
<tr>
<td>N
</td>
<td><a href="Asparagin" title="Asparagin">Asparagin</a>
</td></tr>
<tr>
<td>P
</td>
<td><a href="Prolin" title="Prolin">Prolin</a>
</td></tr>
<tr>
<td>Q
</td>
<td><a href="Glutamin" title="Glutamin">Glutamin</a>
</td></tr>
<tr>
<td>R
</td>
<td><a href="Arginin" title="Arginin">Arginin</a>
</td></tr>
<tr>
<td>S
</td>
<td><a href="Serin" title="Serin">Serin</a>
</td></tr>
<tr>
<td>T
</td>
<td><a href="Threonin" title="Threonin">Threonin</a>
</td></tr>
<tr>
<td>U
</td>
<td><a href="Selenocystein" title="Selenocystein">Selenocystein</a>
</td></tr>
<tr>
<td>V
</td>
<td><a href="Valin" title="Valin">Valin</a>
</td></tr>
<tr>
<td>W
</td>
<td><a href="Tryptophan" title="Tryptophan">Tryptophan</a>
</td></tr>
<tr>
<td>Y
</td>
<td><a href="Tyrosin" title="Tyrosin">Tyrosin</a>
</td></tr>
<tr>
<td>Z
</td>
<td><a href="Glutamate" title="Glutamate">Glutamat</a> oder <a href="Glutamin" title="Glutamin">Glutamin</a>
</td></tr>
<tr>
<td>X
</td>
<td>jede Aminosäure
</td></tr>
<tr>
<td>*
</td>
<td>Stop der <a href="Translation_(Biologie)" title="Translation (Biologie)">Translation</a>
</td></tr>
<tr>
<td>-
</td>
<td>Lücke unbestimmter Länge
</td></tr></tbody></table>
<div class="mw-heading mw-heading3"><h3 id="Dateierweiterung">Dateierweiterung</h3></div>
<p>Es gibt keine Standard-<a href="Dateierweiterung" class="mw-redirect" title="Dateierweiterung">Dateierweiterung</a> für eine Textdatei im FASTA-Format. Jedoch werden folgende Erweiterungen häufig verwendet: .fa, .mpfa, .fna, .fsa oder .fasta.
</p>
<div class="mw-heading mw-heading2"><h2 id="Sequenz-IDs">Sequenz-IDs</h2></div>
<p>Das <a href="National_Center_for_Biotechnology_Information" title="National Center for Biotechnology Information">National Center for Biotechnology Information</a> hat einen Standard für eine ID definiert, die für Sequenzen verwendet werden. Diese „SeqID“ wird in der Kopfzeile verwendet. Die Hilfeseite der formatdb gibt folgendes an: „formatdb will automatically parse the SeqID and create indexes, but the database identifiers in the FASTA definition line must follow the conventions of the FASTA Defline Format.“
</p><p>Dies ist jedoch keine endgültige Definition für das Kopfzeilen-Format. Verschiedene Möglichkeiten sind nachfolgend dargestellt:
</p>
<table class="wikitable">

<tbody><tr>
<td>GenBank
</td>
<td><code>gi|<i>gi-number</i>|gb|<i>accession</i>|<i>locus</i></code>
</td></tr>
<tr>
<td>EMBL Data Library
</td>
<td><code>gi|<i>gi-number</i>|emb|<i>accession</i>|<i>locus</i></code>
</td></tr>
<tr>
<td>DDBJ, DNA Database of Japan
</td>
<td><code>gi|<i>gi-number</i>|dbj|<i>accession</i>|<i>locus</i></code>
</td></tr>
<tr>
<td>NBRF PIR
</td>
<td><code>pir||<i>entry</i></code>
</td></tr>
<tr>
<td>Protein Research Foundation
</td>
<td><code>prf||<i>name</i></code>
</td></tr>
<tr>
<td>SWISS-PROT
</td>
<td><code>sp|<i>accession</i>|<i>name</i></code>
</td></tr>
<tr>
<td>TrEMBL
</td>
<td><code>tr|<i>accession</i>|<i>name</i></code>
</td></tr>
<tr>
<td>Brookhaven Protein Data Bank (1)
</td>
<td><code>pdb|<i>entry</i>|<i>chain</i></code>
</td></tr>
<tr>
<td>Brookhaven Protein Data Bank (2)
</td>
<td><code><i>entry</i>:<i>chain</i>|PDBID|CHAIN|SEQUENCE</code>
</td></tr>
<tr>
<td>Patents
</td>
<td><code>pat|country|number</code>
</td></tr>
<tr>
<td>GenInfo Backbone Id
</td>
<td><code>bbs|number</code>
</td></tr>
<tr>
<td>General database identifier
</td>
<td><code>gnl|database|identifier</code>
</td></tr>
<tr>
<td>NCBI Reference Sequence
</td>
<td><code>ref|accession|locus</code>
</td></tr>
<tr>
<td>Local Sequence identifier
</td>
<td><code>lcl|identifier</code>
</td></tr></tbody></table>
<p>Die vertikalen Striche sind keine Separatoren gemäß der <a href="Backus-Naur-Form" title="Backus-Naur-Form">Backus-Naur-Form</a>, sondern Teil des Formats.
</p>
<div class="mw-heading mw-heading2"><h2 id="Siehe_auch">Siehe auch</h2></div>
<ul><li><a href="FASTA-Algorithmus" title="FASTA-Algorithmus">FASTA-Algorithmus</a></li>
<li><a href="EMBOSS" title="EMBOSS">EMBOSS</a></li></ul>
<div class="mw-heading mw-heading2"><h2 id="Weblinks">Weblinks</h2></div>
<ul><li><a rel="nofollow" class="external text" href="https://emboss.sourceforge.net/docs/themes/SequenceFormats.html#in">Sequenzformate</a></li>
<li><a rel="nofollow" class="external text" href="https://www.ncbi.nlm.nih.gov/blast/fasta.shtml">Beschreibung des FASTA-Formats des NCBIs</a> (englisch)</li>
<li><a rel="nofollow" class="external text" href="http://www.binf.ku.dk/~kasper/misc/lfasta/">LFasta</a> (englisch)</li>
<li><a rel="nofollow" class="external text" href="http://www.bugaco.com/bioinf/">Nexus to Fasta converter</a> (englisch)</li>
<li><a rel="nofollow" class="external text" href="http://gp2fasta.ovh.org/">GenBank to Fasta conventer</a> (englisch)</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-1"><span class="mw-cite-backlink"><a href="#cite_ref-1">↑</a></span> <span class="reference-text"><a rel="nofollow" class="external text" href="http://www.ncbi.nlm.nih.gov/entrez/viewer.fcgi?db=protein&amp;qty=1&amp;c_start=1&amp;list_uids=5524211&amp;uids=&amp;dopt=fasta&amp;dispmax=5&amp;sendto=&amp;from=begin&amp;to=end&amp;extrafeatpresent=1&amp;ef_CDD=8&amp;ef_MGC=16&amp;ef_HPRD=32&amp;ef_STS=64&amp;ef_tRNA=128&amp;ef_microRNA=256">FASTA-Darstellung</a> des Cytochrome b eines Asiatischen Elefanten auf ncbi.nlm.nih.gov, abgerufen am 21. August 2018</span>
</li>
</ol></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2025-10-21" href="https://de.wikipedia.org/wiki/?title=FASTA-Format&amp;oldid=260779986">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>

</body></html>